前幾天介紹的功能,大多是從使用者「說了什麼」開始處理。
但如果 VoCare 想做到主動陪伴,只知道文字或語音其實還不夠。有些時候,使用者可能根本不會主動告訴系統自己累了、坐太久了,甚至發生了跌倒。
因此 VoCare 另一個重要方向就是 多模態感知。
簡單來說,就是讓系統不要只依賴一種資訊。
目前 VoCare 主要會利用手機本身的 相機與麥克風,再搭配使用者資料,取得不同來源的資訊。
把這些資訊放在一起,通常會比單獨依賴某一項結果更可靠。
假設相機分析結果顯示:
疑似跌倒
↓
系統詢問使用者
「你還好嗎?」
↓
麥克風等待回應
如果使用者馬上回答:
我沒事,只是在撿東西。
那系統就可以降低警示。
但如果 影像持續顯示使用者倒在地面,而且 語音也一直沒有回應,就代表這個狀況可能需要進一步處理。
這就是 多模態資訊的價值。
不同資訊可能互相矛盾
實際使用時,不一定每個模組都會得到相同答案。
例如相機認為使用者可能疲勞,但使用者自己表示目前狀況正常。
這時候 VoCare 不能單純因為某個 AI 模型給出高分,就直接採取行動,而是需要把不同來源的結果放在一起判斷。
整體流程
影像資訊
語音資訊
使用者資料
↓
多模態資訊整合
↓
決策規則
↓
提醒 / 確認 / 警示
也就是:
讓 AI 負責提供資訊,再由整體系統決定接下來該怎麼做。
為什麼先使用手機?
目前 VoCare 不打算一開始就加入大量額外感測器,而是先利用手機原本就有的:
相機
麥克風
這樣除了可以降低硬體複雜度,也比較方便先測試整套 AI 感知與判斷流程。
等核心功能穩定之後,再思考是否需要加入其他硬體。
Day 9 小結
多模態感知對 VoCare 來說,是從:
「聊天型 AI」
往:
「能觀察使用者狀態的 AI」
前進的重要一步。
重點並不是收集越多資料越好,而是:
把不同來源的資訊互相驗證,再做出比較合理的判斷。